
先说结果
开源工具 jianying-headless 把剪映变成了可编程的无头工作流:生成原生草稿(多轨、画中画、字幕、音量)、毫秒级 ASR 对齐、自动去噪删气口、剪映人工兜底、后台无界面导出 MP4。相比传统鼠标模拟方案,更可测试、可复用、适合工程化交付。GitHub:mcncarl/jianying-headless。
一、这是什么工具
做短视频的人都知道,剪映是目前最好用的桌面剪辑工具之一——字幕识别准、特效丰富、导出快。但它有一个致命问题:没有官方 API,无法编程自动化。
传统的解决方案是用 UI 自动化工具(如 PyAutoGUI、uiautomation)模拟鼠标点击,但这种方案脆弱不堪——界面改版就崩、分辨率不同就错位、无法批量测试、出了问题难以调试。
jianying-headless 走了一条完全不同的路:直接操作剪映的原生草稿文件,配合无头导出引擎。不需要模拟鼠标,不需要打开界面,用代码就能生成剪映能直接打开的完整草稿,还能后台自动导出 MP4。
1项目地址:github.com/mcncarl/jianying-headless
3技术路线:原生草稿生成 + ASR 音频处理 + 无头导出
4适用场景:批量视频生产、自媒体矩阵、AI 视频工作流、企业视频自动化
二、5大核心能力拆解
能力1:生成原生草稿
jianying-headless 可以直接生成剪映的原生草稿文件,支持完整的剪辑元素:
1多轨编辑:主视频轨、叠加轨、音频轨、字幕轨,任意数量轨道
生成的草稿可以直接用剪映桌面端打开,所有元素都可编辑——这意味着AI 生成 80%,人工微调 20%的工作流成为可能。
能力2:毫秒级 ASR 对齐
字幕对齐是视频剪辑中最耗时的环节之一。jianying-headless 内置了 ASR(自动语音识别)能力,可以将音频转写为文字,并精确到毫秒级对齐每一句字幕的开始和结束时间。
相比剪映自带的字幕识别,可编程的 ASR 有几个优势:
3可以对接第三方 ASR 服务(如讯飞、阿里、Whisper)
能力3:自动去噪与删气口
口播视频最烦的两件事:背景噪音和"嗯""啊""那个"等语气词(气口)。jianying-headless 内置了音频预处理能力:
1自动去噪:基于频谱分析的降噪,保留人声的同时去除背景噪音
2删气口:自动识别并删除"嗯""啊""那个"等填充词,同时保持语速自然
这些处理在生成草稿之前完成,最终草稿里的音频已经是处理好的干净版本。
能力4:剪映人工兜底
这是 jianying-headless 最务实的设计——不追求 100% 自动化,而是允许人工兜底。
生成的草稿是标准剪映格式,可以直接在剪映里打开、编辑、微调。AI 负责重复性工作(粗剪、字幕、音频处理),人负责创造性工作(节奏把控、特效选择、最终审核)。
典型工作流
1. jianying-headless 生成草稿(粗剪+字幕+去噪)
2. 用剪映打开草稿,人工微调(节奏、特效、封面)
3. 剪映导出最终成片
或者:
1. jianying-headless 生成草稿
2. 无头模式直接导出 MP4(适合批量生产、不需要精修的内容)
能力5:后台无界面导出 MP4
对于批量生产场景,连"打开剪映点导出"这个动作都可以省掉。jianying-headless 支持无头模式导出——不需要打开剪映界面,在后台直接调用剪映的渲染引擎导出 MP4。
这意味着:
2可以接入 CI/CD 流水线,代码提交自动生成视频
三、技术原理:为什么不用模拟鼠标
jianying-headless 的核心洞察是:剪映的草稿本质上就是一组 JSON 文件。只要搞清楚草稿的格式规范,就可以用代码直接生成,不需要模拟任何界面操作。
剪映草稿的文件结构
一个标准的剪映草稿文件夹包含以下核心文件:
1draft_content.json:核心配置文件,包含画布设置、轨道信息、片段、特效、字幕等所有剪辑数据
2draft_meta_info.json:草稿元信息,包含草稿名称、创建时间、时长、封面等
3素材文件夹:导入的视频、图片、音频素材的本地副本
只要正确生成这两个 JSON 文件并放入指定目录,剪映启动时就会自动识别并加载这个草稿。这就是 jianying-headless 的技术基础。
无头导出的实现
导出 MP4 需要调用剪映的渲染引擎。jianying-headless 通过命令行参数或进程间通信的方式,在不显示界面的情况下启动剪映的渲染进程,传入草稿路径和导出参数,等待渲染完成后自动退出。
这和 Chrome 的 headless 模式原理类似——有界面的应用,也可以无界面运行。
四、与传统方案对比
1稳定性:UI 模拟 ❌(界面改版就崩)/ jianying-headless ✅(操作文件,与界面无关)
2可测试性:UI 模拟 ❌(难以单元测试)/ jianying-headless ✅(JSON 输出可断言、可 diff)
3可复用性:UI 模拟 ❌(每个流程单独写脚本)/ jianying-headless ✅(草稿模板可复用、参数化)
4工程化:UI 模拟 ❌(难以接入 CI/CD)/ jianying-headless ✅(命令行驱动,天然适合工程化)
5人工兜底:UI 模拟 ⚠️(中间状态难以人工介入)/ jianying-headless ✅(生成标准草稿,随时可人工编辑)
6性能:UI 模拟 ❌(受界面渲染速度限制)/ jianying-headless ✅(文件操作毫秒级,导出可并行)
五、6大典型使用场景
1自媒体矩阵批量生产:一篇文案 → 自动生成多个版本的视频(不同比例、不同字幕样式、不同 BGM),一键批量导出。
2AI 口播视频工作流:TTS 生成语音 → ASR 对齐字幕 → 自动匹配素材 → 生成草稿 → 无头导出,全流程无人值守。
3课程视频自动剪辑:录制好的长视频 → 自动去噪删气口 → 自动分割章节 → 生成带字幕的课程草稿。
4电商产品视频批量生成:产品图片 + 卖点文案 → 自动生成产品介绍视频,不同产品套用同一模板,批量导出。
5新闻/资讯短视频自动化:新闻文本 → TTS 播报 → 自动匹配相关画面 → 生成新闻短视频草稿,适合资讯类账号日更。
6企业内部培训视频:PPT + 讲解音频 → 自动生成培训视频草稿,人工审核后导出,大幅降低培训视频制作成本。
六、快速开始思路
虽然 jianying-headless 封装了复杂的细节,但核心使用思路可以概括为三步:
第一步:准备素材和脚本
准备好视频/图片/音频素材,以及剪辑脚本(哪些素材放在哪个轨道、什么时间点、字幕内容等)。
第二步:生成草稿
调用 jianying-headless 的 API,传入素材路径和剪辑参数,它会自动:
3生成 draft_content.json 和 draft_meta_info.json
第三步:人工兜底或直接导出
两种选择:
2批量生产:调用无头导出接口,后台自动导出 MP4
七、避坑提醒
避坑提醒
坑一:剪映版本兼容性。不同版本的剪映草稿格式可能有差异,升级剪映后需要验证草稿是否能正常打开。建议固定一个剪映版本用于自动化生产。
坑二:素材路径必须绝对路径。草稿里记录的是素材的绝对路径,移动素材文件夹会导致草稿找不到素材。建议用固定的素材目录结构。
坑三:无头导出需要剪映安装。无头导出本质上还是调用剪映的渲染引擎,运行环境必须安装对应版本的剪映。
坑四:ASR 识别率不是 100%。专业术语、口音、背景噪音都会影响识别率。重要内容建议人工校对字幕。
坑五:复杂特效可能不支持。剪映的某些高级特效(如 AI 玩法、智能抠像)可能无法通过草稿生成,需要手动在剪映里添加。
视频剪辑自动化的终极形态,不是用 AI 完全替代人,而是用代码把重复性工作固化,让人专注于创造性工作。jianying-headless 的价值在于,它找到了一条"不模拟鼠标、不破解 API、直接操作原生草稿"的技术路线,让剪映这个没有官方 API 的工具,也能被编程化、工程化地使用。
对于自媒体从业者,这意味着可以把"写文案→配语音→加字幕→导出"这条重复链路全自动化,每天省下 2-3 小时;对于企业,这意味着视频生产可以像软件一样版本化、测试化、流水线化。工具已经就绪,剩下的是创意和执行。
作者声明:本作品含 AI 生成内容。